A statistical framework for evaluating the repeatability and reproducibility of large language models
यह शोध पत्र एक नियामक-सूचित सांख्यिकीय ढांचे को प्रस्तुत करता है जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की अर्थपूर्ण और आंतरिक पुनरावृत्ति (रिपीटेबिलिटी) एवं पुनरुत्पादकता (रिप्रोड्यूसिबिलिटी) को परिमाणित करता है, यह प्रदर्शित करते हुए कि ये मीट्रिक्स प्रॉम्प्टिंग रणनीतियों और मॉडल विन्यासों के आधार पर महत्वपूर्ण रूप से भिन्न होते हैं, अक्सर नैदानिक सटीकता से स्वतंत्र होते हैं, और बायोमेडिकल अनुप्रयोगों में एलएलएम (LLM) विश्वसनीयता के व्यवस्थित मूल्यांकन के लिए आवश्यक हैं।